正負
华 文 生 态 系 统 · 白 皮 书

汉字正负数码

数字底座 · 文字复兴 · 为人类服务
COS (Chinese operating system) — An Autonomous, Controllable Digital Foundation for Chinese Characters
COS · 白 皮 书
文化复兴的底座是文字复兴
让汉语快速融合世界语言 · 汉字互通互识
字库 14,833 字 · 零重码98 组部件 · 26 码位字典 16,142 字条 / 词典 264,434 词条 抗量子 24 码 · 机机密传数据安全保险 10 万元22 语界面 · 195 国授权
发布单位:北京正数负数科技有限公司
定位:成为语言产业的科技领军企业
线上平台:ai.arpa.top(商用) | anquan.arpa.top(安全版)
主专利:202610784807.1 | 发明专利 12 项 | 软件著作权 24 套
发布日期:2026 年 9 月 | 文档编号:COS-WP-2026 | 密级:对外公开
本白皮书用于技术交流与合作洽谈;涉及编码规则、部件体系与加密方案的内容,以双方正式协议为准。
华 文 生 态 系 统

白皮书 · 为人类服务的汉字数码文明基础设施

White Paper — COS (Chinese operating system): A Digital Civilization Infrastructure for Chinese Characters, Serving All Humankind
文化复兴的底座是文字复兴
让全球 70 亿人看见汉字,20 亿人理解汉字,2 亿人分享汉字 —— 以汉字的灵魂,重新打造未来世界

摘要 Abstract

华文生态系统(COS, Chinese operating system)是一套以汉字部件正形与负形为本源的通用数码编码体系:把汉字直接映射为「正码 0–9 / 负码 ⁻0–⁻9 / 字母码 Z X C B N」的数字形态,实现编码即字形、字形即编码——任何汉字可编码,任何编码可还原字形。以此为基础,本生态已建成并上线完整闭环:打字输入 → 字典词典 → 长文闪送与凭据包交付 → 加密语音 → 蒸馏/抗量子加密 → 机机密传 → 中国红码 → 数码编程(DCIS/DCUL)→ 双轨数制(甲子六十进制底层/人侧 26 码位) → 数据安全保险 → 22 语国际站与华语贡献者体系 → HSK 测评与学习生态。
截至目前的核心实测:字库 14,833 字 / 14,833 码位 / 零重码;98 组正负一码部件(85 单数部首 + 13 补充形码部件);26 码位;部首码表 257 条;新华字典 16,142 字条、中文词典 264,434 词条,其中字库直接有码 15,743 字、真正无码仅 44 字;长文闪送数码压缩传输实测容量达 400 万码;抗量子加密通道 24 码+先决条件核验;数据安全保险每份文件保额 10 万元、保金 10 元(按实名国籍计人民币或美元),对方提取后 24 小时无投诉自动结案转为历史保单。所有能力均以「为人类服务」为最高立场。
The Chinese Operating System (COS) ecosystem is a universal digital coding system rooted in the positive/negative shapes of Chinese-character components: every character maps directly into a digital form — positive codes 0–9, negative codes ⁻0–⁻9, and letter codes Z X C B N — achieving the principle that "the code is the glyph, and the glyph is the code." On this foundation the ecosystem now runs a complete, live chain: typing input, dictionary and lexicon, long-text flash delivery with credential-package handoff, encrypted voice, distill and quantum-resistant encryption, machine-to-machine encrypted transfer, the Chinese Red Code, digital coding (DCIS/DCUL), base-26 Taiji arithmetic, data-security insurance, a 22-language international site with a Chinese-language contributors program, and HSK-based learning. Measured today: a 14,833-character code library (14,833 code slots, zero duplicates), 98 one-code components, 26 code positions, 257 radicals, the Xinhua dictionary's 16,142 entries and a 264,434-entry lexicon — with 15,743 characters directly coded and only 44 not yet coded. Everything serves one purpose: serving all humankind.

目录 Contents

  1. 时代命题:文字与数字文明
  2. 技术体系:部件、码位与字库
  3. 功能全景(一):打字、字典与长文闪送
  4. 功能全景(二):加密、机机密传与红码
  5. 数据安全保险:从承保到理赔
  6. 生态与国际:22 语与 195 国
  7. 编程与算力:DCIS/DCUL 与双轨数制
  8. 教育与学术:HSK 与九成之验
  9. 指标实测汇总
  10. 知识产权与标准路径
  11. 路线图
  12. 术语表

一 · 时代命题:文字与数字文明 I. The Proposition: Writing and Digital Civilization

在数字世界里,一切数据、算法、模型与交互,最终都以「文字」为入口:语料的载体是文字,指令的载体是文字,人机对话的入口仍是文字。谁定义了文字的数字存在方式,谁就握住了数字文明的底层开关。汉字是当今世界使用人口最多的文字,却在数字存在方式上长期依赖外部方案——拼音转写、他国输入法内核、域外字符集规范。这带来三重失衡:输入效率受制、编码主权旁落、汉字自身价值在数字链条中被稀释。

1.1 数字时代文字的隐性危机:不必再「理解」它

一种文字真正的危机,不是无人使用,而是使用者不必再理解它。「提笔忘字」之所以成为集体症候,正因为文字在数字链条中从「意义与形体的统一体」退化为「拼音的输入手段」——会读不会写、会打不识形。当文字只剩声音通道,它的人文厚度与形体智慧就同时被截断。

COS 的判断是:要救的不是人们的记忆力,而是文字在数字世界里的存在方式。当每一个汉字都能被「看形取码」直接键入、每一个码都能还原字形,文字便重新成为「可理解、可计算、可继承」的对象,而不再只是语音的附庸。

1.2 数字基础设施缺了什么

缺一层「以字形为本」的编码
主流计算机数制(二进制/十进制)与键盘、汉字字形之间存在结构性割裂:输入靠音,不靠形。
缺一条「语言无关」的文字通道
跨语言系统长期绑定拉丁字母与英文语序,非拉丁文字在数字结构里被动适配。
缺一套「量子时代仍安全」的传送方式
经典公钥密码面临量子威胁,「先收集、后破解」已成现实风险,而密文通道仍依赖数学陷门。
缺一种「可考核」的教育路径
文字学习长期以死记为主,缺乏可量化、可复现的效率改进路径。
缺一座「人人可练」的练习场
练习与真实使用长期割裂:学习者缺少零门槛、可即时反馈、可反复对练的场地——看形即打、随打随改,速度与正确率即时可见,练完即可用于真实输入。
缺一套「练有所奖」的考核与奖励机制
学习成效缺少权威分级与正向激励:既无可对照的等级考核,也无可累积的排行榜与赛事奖励,「学得怎么样、练得值不值」没有答案,练习难以持续。

1.3 COS 的回答:把「形」变成「数」

COS 的选择是回到文字的形体本身:把汉字拆解为**可数的部件**,把部件映射为**正负数码**,再把数码组织为**可计算的数制**。由此获得三个直接结果——

「文化复兴的底座是文字复兴。」
—— 以汉字正负数码为桥,让汉语快速融合世界语言、汉字互通互识

1.4 立场:为人类服务

本白皮书描述的所有技术能力,都从一个立场出发:为人类服务。它不是为一国一族的文字优越性,而是让每一种语言、每一个文明在数字时代都能被平等地书写、平等地检索、平等地传承;让信息在量子时代依然安全;让所有人学习文字的时间与成本显著下降。

二 · 技术体系:部件、码位与字库 II. The Technology: Components, Code Positions, Library

2.1 编码规则:26 码位与 98 组一码部件

COS 以 26 个码位覆盖汉字全部形体要素,与标准键盘一一对应——

码位类别数量内容键位映射
正码100 1 2 3 4 5 6 7 8 9第二排 A–L + M(M=0)
负码10⁻0 ⁻1 ⁻2 ⁻3 ⁻4 ⁻5 ⁻6 ⁻7 ⁻8 ⁻9第一排 Q–P(负号在数字头顶)
字母码6Z 言(讠) / X 木 / C 土(士) / V 补充码 / B 日 / N 金(钅)第三排 Z X C V B N

汉字的取码单位是部件:98 组「正负一码部件」= 85 个单数部首 + 13 个补充形码部件。每个部件对应唯一一枚码片,因此「看字形 → 拆部件 → 取码片」全程不需要读音参与,也不需要记忆字根表以外的拼音规则。

2.2 取码三原则

取大不取小优先取更大的成字部件,减少切片数量
→
最少取码在可唯一识别的前提下,用最少的码片完成输入
→
先笔先取 · 有序取码按书写顺序(先左后右、先上后下、先外后内)推进

当不同汉字取到同一串数码时,采用补充码 V 补位区分(例如「八=8」与「人=8V」);常用长字的数码可放宽到 5 位,以保证高频字仍然直观可记。词组则按 3.3 取码规则(两字各取首码、三字各取首码、四字及以上取前三字首码+末字首码)形成最短可识别整数码。

2.3 字库实测:14,833 字,零重码

14,833
已编码汉字(字)
14,833
唯一码位(个)
0
重码位
98
正负一码部件(组)
26
码位(正10+负10+字母6)
257
部首码表条目

字库并非静态清单,而是一条可扩展、可回归验证的生产线:单字字表 → 编码管线(部件解析、码位仲裁、重码补位)→ 字库与码位表 → 页面内嵌 → 线上运行。管线内置三重保障:

2.4 从字库到字典:覆盖率实测

以新华字典与中文词典为标尺,字库的覆盖情况如下:

指标实测值说明
新华字典字条16,142字典收录汉字规模
中文词典词条264,434词组编码与查询的数据基础
字库直接有码15,743可直接键入并还原
可经繁简映射打出355由标准字码扩展
真正无码44多为域外异体/罕用字,持续补录中

覆盖率 ≈ 99.7%(可直接键入 + 繁简映射)。这一数字意味着:对日常书写、出版物用字与绝大多数文献用字,COS 已具备完整替代能力。

2.5 取码示例:可解释、可复现

编码的价值在于「可解释」——同一个字,任何人按同一规则都能得到同一串数码。以下为实际字例(V 为补充码,⁻ 表示负码):

字形体依据数码说明
八单一部件8最简形态:一码成字
人与「八」同码8V以补充码 V 区分(重码补位)
凸同码竞争0VV 补位第二位
凹同码竞争0VVV 补位第三位
森木+木+木(木=X)XXX三同部件:形与码完全一致
嗯口+因(口=0)004⁻2V常用长字,补充码收尾
嘢口+野(口=0)0051V方言常用字亦按同规则取码
絶繁体「絶」= 简体「绝」形⁻79V繁体与简体共享同一码基,以 V 区分
緑繁体「緑」= 简体「绿」形⁻7⁻3⁻1VV异体字按形体映射,兼容繁简

从表中可见三条规律:其一,同形同码——字形相同则数码相同;其二,繁简互通——繁体与简体共享码基,仅以补充码区分,因此同一份数码可跨字体还原;其三,可扩展——新字只需按同一部件规则取码,不改变任何既有字码。

三 · 功能全景(一):打字、字典与长文闪送 III. Capabilities I: Typing, Dictionaries, Flash Delivery

3.1 打字输入

用户在标准键盘上「看形取码」即可完成汉字输入:键位图与物理键盘一一对应,第一排为负码、第二排为正码、第三排为字母码。支持候选选择、词库联想、繁简切换、深色模式、语音播报与输入预览。全过程不依赖拼音——这对不熟悉汉语拼音的使用者、非母语学习者、以及需要在无读音环境中录入的场景,都是结构性的效率改变。

3.2 字典与词典

平台内置两部权威工具书的数字版:新华字典 16,142 字条与中文词典 264,434 词条,每条同时给出拼音、部首、笔画、释义与正负数码。查询支持按字、按词、按数码三向检索——这是传统字典做不到的一条通道:知道形,就能查到字;知道码,就能查到义。

3.3 长文闪送:从「记住一串码」到「交付一个凭据包」

长文闪送解决的是一件事:如何把一份内容安全地交给另一个人,而不让它停留在任何可被窥视的位置。当前版本的完整流程如下:

① 加密压缩文本/文件按内容压缩并数码化
→
② 同步分析命中已有码则复用原数码,否则随本次点击入库
→
③ 生成凭据包数码+多维度条件一并打包
→
④ 发送对方复制凭据或发送凭据文件
→
⑤ 自动匹配解密对方粘贴或拖入提取栏即解
→
⑥ 一次性失效成功接收后该数码自动失效

三个设计要点值得说明:

3.4 打字之外:学习闭环

输入只是入口。围绕「学会、练熟、考核、坚持」四个环节,平台提供了配套闭环:

练习模式
内置多篇短文与随机切换,实时统计输入速度、用时与正确率,练完即见进步曲线。
生词本与查码
输入中遇到的生字可即查即存;支持按字查码、按词查码与新词新字入库。
国学文库
成语、唐诗、宋词与经典的数码化阅读与检索,让练习材料本身就是文化内容。
等级测评
HSK 1–6 级框架下的中文等级测评,为学习进度提供外部标尺。
学习排行榜
以累计练习字数为排名依据,把个人坚持变成可比较的公开进度。
学习视频
配套 12 个学习视频,站内播放,讲清取码规则与常见字拆解。

这套闭环的意义是:把「认字」拆成可测量的小步——看得懂(拆部件)→ 打得准(取码)→ 测得清(测评)→ 坚持得下去(排行榜与练习)。

四 · 功能全景(二):加密、机机密传与红码 IV. Capabilities II: Encryption, Machine-to-Machine, Red Code

4.1 三档加密通道

平台的加密能力分为三档,覆盖从日常到高敏的不同需求:

通道形态适用与要点
蒸馏加密12 码中文加数码的常规档:密文是汉字按形蒸馏出的正负数码,无数学陷门可攻;普通用户与会员均可使用。
抗量子加密24 码 + 先决条件核验高敏档:发送方可设定姓名/虹膜/声纹/自主口令等多维度先决条件,提取方须逐项匹配;连续核验失败将自动销毁该项加密。
加密语音音频字节数码化录音后按字节转为正负数码密文入库,提取方在本页解密播放或下载音频文件,全程不落第三种格式。

4.2 一次性密钥语义与「链路不见明文」

4.3 机机密传:两台计算机之间的全自动加密互认

机机密传面向指挥调度、应急系统、智能驾驶、高危物品管理等需要在机器之间直接、私密传递重要信息的场景。其机制要点:

机器码互认双方机器码自动识别,无需人工填写
→
IP 自动比对服务器侧校验来源,异常即拒绝
→
会话密钥一次性传递密钥随本次连接生成并随连接传递
→
3 分钟时效密文限时有效,超时自动失效
→
本机自动解码对方在本机完成解码,不经人工、不经第三方

对于「一对多」投递,平台支持向多台已确认接收机逐台定向加密投递,每台独立一次性会话密钥,各自自动解码。也可将机机密传内容导出为凭据文件交付,接收方拖入提取栏即在本机解密。

4.4 后量子升级路线

平台已按「编码层—存储层—密码层—架构层」四层纵深预置后量子能力,并规划与 NIST 后量子标准(ML-KEM/ML-DSA)的对接升级。需要强调的是:即便公钥算法被量子计算攻破,本体系的密文仍不以数学难题为唯一防线——一次性语义与提取即删的机制不因算力提升而失效。

4.5 中国红码:让「分享」与「直连」变成扫一扫

中国红码是平台自有的码制(当前 v3 形态:37×37 垛口外圈 + 9 个 11×11 小码点,小码点各自随机旋转,保留隔离线以便稳定识别)。它承担两类工作:

五 · 数据安全保险:从承保到理赔 V. Data-Security Insurance: Underwriting to Claims

把「安全」从技术承诺变成可查询、可赔付、可审计的制度安排,是 COS 在行业内的一项独特设计。数据安全保险已随加密功能上线运行。

5.1 承保要素

10 万元
每份文件保额(丢失赔付)
10 元
保金(中国籍人民币)
$10
保金(外籍美元,按实名国籍)
24 小时
提取后无投诉自动结案

5.2 保单生命周期

加密入库生成保单号,与提取数码绑定
→
承保中凭据交付、等待对方提取
→
已提取对方成功接收,数码失效
→
24 小时无投诉自动结案
→
历史保单留档可查、可导出对账

5.3 用户侧:查询、对账与理赔

用户中心「🛡 我的保单」提供完整的自助能力:

5.4 平台侧:保单管理与资金视图

管理后台在「财务管理」之下设置「保单管理」,含两个视图:

视图内容用途
保单收入保单总数、保金收入合计、逐单明细(保单号/归属用户/保金/状态)收入核对与对账
保单理赔理赔笔数与合计、逐笔明细(保单号/金额/状态/时间)与赔付登记(单份上限 10 万元)理赔处理与风控

在用户侧的加密传输区,平台明确标注「丢失泄密赔 10 万」——把安全承诺写在用户看得到的地方。

5.5 为什么把「保险」放进编码生态

因为安全不是一个技术形容词,而是一组可执行的义务:承诺要能被查询,责任要能被追溯,损失要能被赔付。保险机制把「我们很安全」翻译成「如果出事,我们按规则赔」——这是技术自信的制度化表达,也是让机构与个人敢于把重要内容交给这套通道的前提。

5.6 制度意义与合规边界

把保险写进产品流程,实质上是把「安全承诺」变成三项可验证的义务:

义务落地方式
数据最小化服务器仅存数码密文,提取即删、不可视、不缓存;平台不掌握明文内容。
责任可追溯保单与提取数码一一绑定,承保、提取、结案、理赔各环节状态留痕,可查询、可导出对账。
赔付可执行保额、保金、上限、结案口径均为明示规则;用户可自助发起理赔,平台按流程审核处理。

同时有必要明示边界,避免误读:① 保险按「一份加密文件一份保单」计算,单份保额上限 10 万元;② 保金按实名认证身份确定币种与标准;③ 保单在对方提取后 24 小时无投诉即自动结案,此后作为历史保单留存备查;④ 是否参与由用户自行选择,平台不强制。

六 · 生态与国际:22 语与 195 国 VI. Ecosystem & Internationalization

6.1 22 语界面与语言无关的中间表示

平台提供 22 种界面语言一键切换,覆盖主要语区。更关键的一层在于:因为 COS 编码以字形为本、与读音解耦,汉字数码天然成为一种语言无关的中间表示——同一串数码,在不同的语言环境中可以对应不同的读音与释义,而字形与编码保持稳定。这为跨语言检索、跨语言教学与多语内容对齐提供了统一的数据底座。

6.2 195 国授权体系

围绕「汉字出海」,平台建立了覆盖 195 个国家与地区的授权体系:包括语言教学机构、出版与内容机构、硬件与系统集成商的合作框架,以及面向不同国家的语言研究与教学落地路径。

6.3 华语贡献者体系

平台设立「华语贡献者」名录,致敬文字创制、统一与传播的先贤与专家,并向当代与在世的学者开放推荐与审核通道。当前名录共 139 位:

分类人数说明
远古文字22造字与文字整理的先贤
近代文字35近代文字改革与国语运动先驱
当代文字31当代文字学、语言学与信息安全领域的院士与专家
专家学者51推荐并审核通过的专家学者
其中:院士 18 / 学部委员 3 / 专家教授 59为体系提供语言科学权威保障

名录的展示规则公开透明:当代文字与专家学者两类按前一日查看数量排序,排名不分先后。每位贡献者拥有独立官网页,可由读者直接访问。

6.4 学习生态:排行榜与书法大赛

6.5 会员体系与推广体系

生态的可持续依赖清晰的权益与激励结构:

这套结构的取向是:让使用者得到实惠、让传播者得到回报、让合作方得到标准——生态因此不是单向推广,而是多方共建。

七 · 编程与算力:DCIS/DCUL 与双轨数制 VII. Coding & Computing: DCIS/DCUL and Base-26

7.1 数码编程体系:DCIS 与 DCUL

当文字成为数码,指令也可以成为数码。平台构建了两套面向开发者的体系:

体系规模作用
DCIS(数码指令集)97 条编码 × 8 种语言以数码为核心的指令表达,覆盖常用程序逻辑;8 种语言绑定便于跨语言实现与教学
DCUL(数码接口层)37 个接口为外部系统接入提供标准接口,使汉字数码能力可被调用、可被集成

其意义不在于替代现有编程语言,而在于提供一条以汉字/数码为原语的表达路径:让中文使用者可以用母语的字形与数序思维组织逻辑,也让教学场景可以用同一套符号贯通「识字—算术—编程」。

7.2 双轨数制:甲子六十进制(底层)与人侧 26 码位

26 个码位不仅是一套输入法,也是一种数制:以 26 为基,正负对称,免进位负担。其实测指标如下:

17,576
26³ 状态空间(三码位)
4.70 bit
单次击键信息量
−92.3%
进位次数减少
−79%
存储与传输量下降
40–60%
较 UTF-8 编码更省
100,007
例换算零误差

这些数值来自实际换算与压力测试:在 100,007 例整数与 26 码位(数码片)互转中零误差;在可比较的语料与数据规模上,采用数码化表达后的存储与传输量出现数量级改善。需要说明的是,甲子六十进制与二进制彼此兼容而非互斥:它可以在现有计算体系之上运行,作为面向「文字—数码」场景的更高效表达层。

7.3 三算合一的教学意义

文字、算术与逻辑原本是三条学习路径,在 COS 中它们共用同一套符号:识字用码位、算术用数制、逻辑用指令集。对教育场景而言,这意味着学习者不必在三套彼此割裂的符号系统之间反复切换——学习成本显著下降,而迁移能力显著提高。

八 · 教育与学术:HSK 与九成之验 VIII. Education & Academia

8.1 测评与内容体系

8.2 学习路径的改变:从「音—形—义」到「形—码—义」

传统识字路径以读音为入口:先记音,再由音联想形与义。COS 提供了另一条路径——以形体为入口:看字形 → 拆部件 → 取数码 → 得字义。其价值在于三方面:

  1. 绕开读音门槛:不依赖拼音基础,降低非母语者与方言区学习者的入门难度;
  2. 形体可解释:每个数码都有部件依据,汉字不再是需死记的任意符号;
  3. 可复现、可考核:取码规则明确,学习效果可用测评数据纵向对比。

8.3 九成之验:一个可考核的目标

平台提出阶段性目标:进入教育体系后,全人类学习文字的时间平均减少 90%(远期愿景 99%)。为使这一目标可被检验,平台给出三条验证路径与一组量化指标:

验证路径方法观测指标
试点前后测同一批学习者在同一课程标准下,采用 COS 路径前后各进行一次测评达标用时、单位时间识字量、留存率
机构数据对照与教学机构合作,在平行班之间进行路径对照课堂学时、作业正确率、教师工作量
等级测评对照以 HSK 1–6 级为标尺,比较达到同一等级所需训练时长等级通过率、等级用时
目标口径:进入教育体系后全人类学习文字的时间平均减少 90%;远期愿景 99%。
—— 该目标以可复现的测评数据为验收依据,而非修辞

8.4 学术共建

平台向语言学研究机构提出「共建五请」:标准研究、联合教学实验、学术论证、数据开放、人才培养。可交付成果包括:字库与码表、测评题库、标准建议稿,以及与教学机构共研的实验数据。

九 · 指标实测汇总 IX. Measured Indicators

下表汇总本白皮书涉及的核心实测指标,供评估与验收对照。

类别指标实测值
编码与字库已编码汉字14,833 字
唯一码位14,833 个(重码位 0)
正负一码部件98 组(85 单数部首 + 13 补充形码部件)
码位26(正码 10 + 负码 10 + 字母码 6)
部首码表257 条
码长合规数码码片常规 ≤4(补充码 V 不计入),常用长字可 5 位
字典词典新华字典字条16,142
中文词典词条264,434
字库直接有码15,743
真正无码44
闪送与加密数码压缩传输容量实测达 400 万码
加密通道蒸馏 12 码/抗量子 24 码+先决条件/加密语音
机机密传时效3 分钟,对方本机自动解码
数据安全保险每份文件保额10 万元
保金10 元(中国籍人民币/外籍美元,按实名国籍)
自动结案对方提取后 24 小时无投诉自动结案转历史保单
理赔用户可发起申请 → 待审核 → 已赔付/已驳回(单份上限 10 万元)
生态与国际界面语言22 语
授权体系195 个国家与地区
华语贡献者139 位(远古 22/近代 35/当代 31/专家 51;院士 18/学部委员 3/专家教授 59)
编程与算力DCIS97 条编码 × 8 种语言
DCUL37 个接口
数制效率26³=17,576;4.70 bit/击;进位 −92.3%;储运约 −79%;较 UTF-8 省 40–60%
换算准确性100,007 例零误差
教育与学术测评体系HSK 1–6 级;12 个学习视频
阶段目标进入教育体系后学习文字时间平均减少 90%(远期 99%)
平台与知产双站架构商用站与安全版独立运行,用户与数据相互隔离
知识产权主专利 202610784807.1;12 项发明专利;24 项软件著作权

十 · 知识产权与标准路径 X. Intellectual Property & Standards

10.1 知识产权布局

围绕编码体系、加密方法、传输机制与算力架构,平台已形成体系化的知识产权组合:

类别数量说明
主专利202610784807.1基于正负杂合数的汉字数码化编码模型
发明专利12 项覆盖编码、加密、传输、机机密传等方向
软件著作权24 项覆盖字库、输入、闪送、字典、后台、加密与安全、运营与资料等模块

10.2 标准路径:三步走

第一步 · 团体标准以企业标准与团体标准形式固化编码、字库与接口规范,先行先试
→
第二步 · 行业标准联合教学、出版、信息安全等行业机构,形成跨行业应用规范
→
第三步 · 国家与国际标准推动汉字数码编码进入国家字符编码标准体系,并参与国际标准对话

平台提出的编码标准方向(CSCII,Chinese Standard Code for Ideographic Input)参照 ASCII 的历史角色:让每一个汉字拥有紧凑、可解释、可逆的数码身份,并可与现有字符集互为映射,从而在不破坏既有生态的前提下获得更优的中文表达层。

10.3 自主可控的四个维度

编码自主
汉字数字身份由中国自主定义,不依附外部方案。
数据主权
密文以本国文字为承载体,敏感数据传输不依赖境外密码设施。
产业引领
以编码底座带动输入法、教育、编程、硬件与云服务的全链升级。
文化安全
文字是文明的载体,编码是文字的命脉;掌握编码,才掌握数字时代的话语权。

十一 · 路线图 XI. Roadmap

平台已越过「技术验证」阶段:编码、字库、字典、闪送、加密、机机密传、保险与生态体系均已上线运行。后续工作沿三条主线推进。

主线近期(已上线/进行中)中期远期
编码与字库 14,833 字零重码;部首码表 257 条;旧密文兼容层 补齐剩余 44 个无码字;扩充异体字与域外汉字;持续人工校订扩库 形成完整汉字数码编码规范与字符集建议稿
安全与保险 三档加密、机机密传、一次性密钥语义、数据安全保险(10 万保额/10 元保金/24 小时结案/理赔全流程) 后量子算法对接(ML-KEM/ML-DSA);理赔证据附件;机构级保单汇总与审计视图 面向关键行业的合规加密通道与保险机制常态化
教育与国际 HSK 1–6 级测评;22 语界面;195 国授权;华语贡献者 139 位;学习排行榜与书法大赛 试点校与教学机构合作,形成「九成之验」前后测数据集 进入多国教育体系,实现学习文字时间显著下降的可复现证据链

11.1 关键里程碑(已完成)

十二 · 术语表 XII. Glossary

术语释义
COS华文生态系统(Chinese operating system · 华文操作系统):以汉字部件正负形为本源的数码编码体系与生态总称。
正码0–9 十个正数码位,对应键盘第二排(A–L 与 M=0)。
负码⁻0–⁻9 十个负数码位,对应键盘第一排(Q–P),负号显示在数字头顶。
字母码Z 言(讠)/X 木/C 土(士)/V 补充码/B 日/N 金(钅) 六个字母码位。
正负一码部件对应唯一一枚码片的汉字部件,共 98 组(85 单数部首 + 13 补充形码部件)。
补充码 V重码区分机制:不同汉字取到同一数码时,以 V 补位区分(如「八=8」「人=8V」)。
3.3 词组取码词组最短码规则:二字词各取首码;三字词各取首码;四字及以上取前三字首码+末字首码。
凭据包加密完成后生成的交付物:数码与多维度条件一并打包,可复制凭据文本或下载凭据文件;对方粘贴或拖入提取栏即自动匹配解密。
先决条件抗量子加密的多维度核验条件(姓名/虹膜/声纹/口令),提取方须逐项匹配。
一次性密钥语义提取即删、不可视、不缓存;对方成功接收后该数码自动失效。
机机密传两台计算机之间的全自动加密互认传输:机器码互认、IP 比对、会话密钥一次性传递、3 分钟时效、本机自动解码。
中国红码平台自有码制(当前 v3:37×37 垛口外圈+9 个 11×11 小码点),用于内容分享与设备邀请直连。
电子保单数据安全保险的凭证:每份加密文件一份,与提取数码一一绑定,含保额、保金、币种与承保状态。
DCIS/DCUL数码指令集(97 条编码 × 8 种语言)与数码接口层(37 个接口)。
太极算以 26 码位为基的算力表达方式,正负对称、免进位;26³=17,576 状态空间,单次击键 4.70 bit。
CSCII汉字数码编码标准方向(Chinese Standard Code for Ideographic Input),三步走推进:团体→行业→国家与国际。

结语 Closing

汉字正负数码不是一项孤立的技术发明,而是一次关于「文字如何在数字世界继续存在」的回答:让每一个汉字都能被看形取出、被计算、被安全传送、被平等学习。它所连接的是四件事——文字的尊严、信息的安全、教育的效率、文明的互通。

本白皮书所载的每一项指标,都对应着线上正在运行的功能;所承诺的每一项安全义务,都有可查询的保单与可执行的理解赔付流程。我们愿意把它放在公开的标准之下接受检验,因为文化复兴的底座是文字复兴,而文字复兴的底座,是每一个普通人都能更轻松地读懂、写出并传递自己的语言。

以汉字正负数码为桥 —— 让汉语快速融合世界语言,汉字互通互识,
让未来人类学习语言的时间与成本显著下降。
华文生态系统 · COS | 白皮书
主专利 202610784807.1 | 12 项发明专利 | 24 项软件著作权
本白皮书为对外公开材料;技术实现细节与安全机制依保密纪律另行管理。